浙江大学学报(工学版), 2026 可见光-红外行人重识别 跨模态检索 全局特征 特征对齐 嵌入增强

全局学习扩展的可见光-红外行人重识别

郭子强1   肖璇1   陶浩然1   王少荣1,2*

1 北京林业大学 信息学院
2 国家林业草原林业智能信息处理工程技术研究中心

TL;DR提出全局学习扩展(GLE)嵌入增强网络,融合ViT全局建模与CNN局部特征提取优势,通过多样化嵌入生成和图结构对齐机制显著缩小可见光-红外模态差异

Abstract

GLE网络由全局特征聚合(GFA)模块和特征多样化扩展(FDE)模块组成。GFA通过循环卷积和位置编码模拟ViT全局建模能力,FDE利用CNN+ViT多分支生成多样化嵌入特征,配合全局特征学习(GFL)损失通过图结构对齐机制减小模态差异。在SYSU-MM01和LLCM上Rank-1分别比基线DEEN提升4.24%和9.05%。

Method

现有方法使用单一CNN或ViT架构,难以平衡全局语义理解和局部细节捕捉。跨模态行人重识别面临可见光与红外图像在颜色、纹理等视觉特征上的显著差异,现有方法忽视跨模态特征对齐,限制了实际应用性能。

通过循环卷积融合ViT全局建模能力到CNN中,利用多分支(CNN空洞卷积+ViT自注意力)生成多样化嵌入,并通过图结构亲和矩阵对齐(KL散度)驱动ViT分支嵌入引导原始特征关注全局信息,同时缩小跨模态差异。

GFA

全局特征聚合模块

将输入特征分为水平/垂直方向,分别添加可学习位置编码后执行循环卷积,在纯卷积框架下实现全局感受野,同时保持位置敏感性。可嵌入主干网络多个阶段,计算效率高于ViT自注意力。

FDE

特征多样化扩展模块

包含3个分支:分支1-2使用不同扩张率(1,2,3)的3×3空洞卷积捕获多尺度局部特征,分支3采用双头自注意力ViT模块捕获全局特征。所有嵌入与原始特征拼接后输入下一阶段,有效缓解训练样本不足问题。

GFL Loss

全局特征学习损失

通过图结构亲和矩阵(KL散度)实现三重对齐:(1)可见光模态下ViT嵌入引导原始特征关注全局;(2)红外模态下同样对齐;(3)可见光与红外原始特征跨模态对齐,生成模态差异更小的嵌入。

整体架构:双流ResNet-50提取可见光/红外初始特征,前3阶段分别接入GFA模块融合局部与全局信息,第3阶段额外接入FDE模块生成多样化嵌入,通过GFL损失约束嵌入质量和模态一致性,端到端联合优化交叉熵+三元组+GFL损失。

GFA通过将特征分为水平/垂直两路,分别添加可学习位置编码后执行循环卷积(堆叠输入并首尾连接形成闭环),在保持位置敏感性的同时实现全局感受野。相较于ViT自注意力,纯卷积实现计算效率更高。

GFL损失构建特征间关系的亲和矩阵(基于欧氏距离的softmax归一化),通过KL散度对齐ViT分支嵌入与原始特征的图结构(传递全局信息),以及可见光/红外模态原始特征的图结构(减小模态差异)。超参数λ1=0.6, λ2=0.6, λ3=0.2时最优。

Results

SYSU-MM01 全搜索
78.94%
Rank-1
比基线DEEN(74.7%)提升4.24% Rank-10(98.39%)和Rank-20(99.55%)达SOTA
SYSU-MM01 室内搜索
85.99%
Rank-1
比基线DEEN(80.3%)提升5.69% 室内搜索模式表现突出
LLCM 可见光检索红外
71.55%
Rank-1
比基线DEEN(62.5%)提升9.05% 低光照场景显著提升
RegDB 可见光检索红外
94.92%
Rank-1
Rank-10(98.84%)达SOTA 多指标达到当前最优水平
MethodSYSU-MM01 R-1SYSU-MM01 mAPRegDB R-1(V→I)LLCM R-1(V→I)
DART68.766.383.660.4
MPANet70.668.282.8-
DEEN74.771.891.162.5
HOS-Net75.674.294.764.9
IDKL81.479.994.772.2
GLE ours78.9476.0794.9271.55

GLE在SYSU-MM01全搜索模式达到78.94% Rank-1和76.07% mAP,比基线DEEN分别提升4.24%和4.27%。在LLCM低光照数据集上Rank-1提升达9.05%。消融实验证实FDE+GFL+GFA完整模型比基线提升4.2% Rank-1和4.3% mAP。模型参数量115.20M,推理延迟13.23ms,在可接受范围内。

Qualitative Results

Takeaway

循环卷积+位置编码可在纯CNN框架下高效实现全局建模,多分支(CNN+ViT)嵌入生成有效缓解样本不足。关键启示:通过图结构亲和矩阵对齐实现跨模态特征分布一致性,是一种简单有效的模态差异减小策略。

Citation

@article{guo2026gle,
  title={全局学习扩展的可见光-红外行人重识别},
  author={郭子强 and 肖璇 and 陶浩然 and 王少荣},
  journal={浙江大学学报(工学版)},
  volume={60},
  number={4},
  pages={1--9},
  year={2026},
  doi={10.3785/j.issn.1008-973X.2026.04.000}
}